Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
본 논문은 의료 관련 프런티어 언어 모델의 안전성을 평가할 때 단순한 집계 점수만으로는 임상적으로 의미 있는 오류의 방향성, 맥락적 편향, 위기 대응 능력 등을 포착할 수 없음을 보여주며, 모델 간 성능 이질성과 비단조적 특성을 고려한 구체적인 안전성 평가가 필요함을 강조합니다.